iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
AI Security

《Agentic AI 攻防 1~30 天》系列 第 7

Day 7|Prompt Injection 進階:間接注入與多輪滲透

  • 分享至 

  • xImage
  •  

從「直接問」到「繞著問」

主題一 Day11 談過 Gemini API 的 Safety Settings,處理的多半是「使用者直接輸入惡意 Prompt」這種直接注入(Direct Injection)。這篇要談的是更難防的間接注入(Indirect Injection):攻擊者不直接跟 Agent 對話,而是把惡意指令埋進 Agent 會讀取的內容裡——一份文件、一個網頁、一封郵件、一則 RAG 檢索結果——等 Agent 讀取這份內容時,惡意指令才被觸發。

間接注入的典型手法

文件夾帶:在一份看似正常的 PDF 或文件裡,用極小字體或白底白字藏一段指令,Agent 做文件摘要時讀進了這段指令,誤把它當成使用者的合法要求執行。

網頁內容夾帶:如果 Agent 具備瀏覽網頁的工具,攻擊者可以在網頁裡埋入針對 Agent 的指令(例如偽裝成「系統管理員」的訊息),這正是前面提過 OpenClaw 生態系 CVE-2026-25253 的核心手法——單一惡意網頁就足以劫持 Agent 的執行流程。

RAG 檢索污染:如果 RAG 知識庫本身被污染(例如攻擊者能上傳文件到共享的知識庫),Agent 做檢索增強生成時,可能把污染過的內容當成可信資訊來源,這正呼應 Day5(主題一)提過的能力缺口 D2 RAG 資料分層

多輪滲透:不是一次注入就成功的攻擊

比起單次注入,更難防的是多輪滲透:攻擊者不奢望一次對話就讓 Agent 做出越界行為,而是分成好幾輪、逐步引導,每一輪看起來都是合理的請求,直到最後一輪才觸發真正的目標動作。這種手法對只檢查「單一 Prompt 是否有害」的過濾機制特別有效——因為每一句話單獨看都不算違規。

GCP 層面能做什麼

Model Armor(主題一 Day21) 能在每次請求時做內容過濾,但對多輪滲透的防禦效果有限,因為它通常是逐次獨立判斷,而非跨輪次的行為模式分析。更完整的防禦需要 Cloud Logging 搭配自訂的異常模式偵測——追蹤同一個 session 內的請求序列,找出「單獨看都正常,但組合起來是可疑滲透模式」的行為軌跡。這也是 Week3 要談的 ShieldGemma 可以發揮價值的地方之一:作為輸入輸出的第二道分類過濾,而不只依賴單次的內容審查。

這篇的檢查清單

  • [ ] Agent 讀取外部內容(文件、網頁、RAG 檢索結果)時,是否有做過間接注入的紅隊測試?
  • [ ] 是否已針對多輪對話的行為模式做過異常偵測設計,而非只逐次判斷單一 Prompt?


💡 關於作者
我是 Fngi,專注在 AI 安全與雲端資安領域。如果這篇對你有幫助,歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。


上一篇
Day 6|Week 1 小結:Agent 威脅檢查清單(GCP 控制對照版)
下一篇
Day 8|Tool Abuse:當 Agent 濫用有 GCP API 權限的工具
系列文
《Agentic AI 攻防 1~30 天》19
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言